DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍
DeepSeek V4 多模态开源,我们把它的视觉链路拆了一遍图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。
搜索
图片不只被编码,还直接参与 Attention、MoE 与 Agent 推理。
随着开源模型能力不断提升,它们已经能够以极低的成本生成多个高质量候选方案,并进一步利用模型自身对这些结果进行验证、打分和筛选。斯坦福团队最新实验发现,使用 DeepSeek V4 Flash + LLM-as-a-Verifier 进行「自验证」,可以在 Terminal-Bench 2.1 上超越 Claude Fable 5,同时整体成本低约 11 倍。
同样的模型,同样的任务,让它执行五遍,再让他自己挑一遍最稳的,效果能有多大提升?斯坦福把这套玩法用在了AI身上,DeepSeek V4 Flash在Terminal-Bench 2.1的成绩从79%一路涨到88%,反超了尖子生Fable 5。而且连做五遍加挑选这一通折腾,价格依然比Fable 5便宜了4-11倍。
本周五,AI 社区热烈讨论的是一个端侧大模型部署技术,它能让笔记本 RTX 4060 跑 Qwen 3.6-35B,桌面 RTX 5090 跑得起 DeepSeek-V4-Flash 284B。而且都是单卡,模型都是满血的。Codex 生产 trace 的中位 decode 速度是 33 token/s
DeepSeek V4 Pro,可能又又又更新了。今天下午,有用户在技术社区 Linux.do 发帖称,自己在DeepSeek Harness标准模式、V4 Pro Max思考档位下,发现模型的思维链突然变了。
一个 Skill,就能让 DeepSeek V4 Pro 超过 Fable 5?
8月13日凌晨,DeepSeek V4 Pro正式登场,给开源模型生态又添一把猛火。从Kimi K3到MiniMax H3,再到DeepSeek V4 flash、DeepSeek V4 Pro,在中国开源模型的猛攻之下,美国的AI公司这次是真的坐不住了。
在昨天正式发布DeepSeek V4 Pro正式版之后。 预告了很久的,DeepSeek家自己的Agent产品终于也发出来了。 名字叫,DeepSeek Harness。 理念也很清晰,一切皆插件。 可能是有史以来最快的速度,截止到我写完文,它在Github上到了3万7的Star。
今天凌晨,DeepSeek V4 Pro 正式版发布,引发热潮。现在,半天过去,DeepSeek Harness (开发者预览版)也来了!当然,这并不意外,毕竟该项目之前已经铺垫了很久了,比如 DeepSeek Harness 团队的崔添翼就一直在社交网络上发预热贴以及为该团队招募人才。
昨晚 AI 圈又炸了。阿里开源Qwen3.8-2.4T-A95B,DeepSeek V4 Pro正式版发布,马斯克推出最新一代旗舰模型Grok 4.6。7 月 16 日,Grok 4.5 才刚发布。短短 27 天,Grok 4.6 就来了。